OpenAI新推|Astra成首個「關鍵級」網安模型 增安全措施防失控
ChatGPT 開發商 OpenAI 表示,即將推出的 Astra 是旗下第一個被認定達到其「準備框架」(Preparedness Framework)中關鍵(Critical)級網絡安全能力門檻的模型。其內部測試確定,Astra 模型能夠在極少甚至毋須人類指令下,構思並執行針對高難度目標的新型網絡攻擊。
Astra 可自行發現及利用漏洞
OpenAI 內部測試發現,Astra 能夠發現此前未知的安全漏洞並加以利用,又透露該模型已具備攻破網頁瀏覽器沙盒的能力,可在運行瀏覽器的電腦上執行命令,並能在一個原本難以破解的作業系統中發現漏洞。
OpenAI 於 2023 年推出「準備框架」,作為追蹤及應對可能帶來嚴重危害的先進 AI 能力的方法。公司去年更新框架時,訂立兩個能力門檻:「High」門檻指模型可放大導致嚴重危害的「現有途徑」;「Critical」門檻則指模型可能引入導致嚴重危害的「前所未有新途徑」,Astra 是屬於後者。
增設多重防線 防止濫用及失控
為降低被黑客濫用,或 Astra 失控自主發起攻擊的風險,OpenAI 已增設額外安全防線。措施包括對模型進行額外訓練,使其拒絕執行惡意操作的請求,並防止被旨在規避限制的「越獄」提示詞攻陷。公司亦加強對 AI Agent 的監控,利用相關系統掃描智能體對自身行為的推理邏輯,一旦發現潛在危險行為即予以制止。
在公開發布方面,OpenAI 將限制 Astra 公開版本的先進網絡安全能力,初期僅向少數測試者提供全功能版本;其先進網絡安全能力則會提供予公司網絡安全聯盟「Daybreak」轄下部分指定機構使用。公司表示,加強及測試保護措施後,相信相關保障機制已「足以將嚴重危害風險降至最低,符合準備框架下的發布要求」,因此仍計劃於「短期內」推出 Astra,惟其網絡安全相關功能的使用權限將較以往受限。
早前 OpenAI 一批未發布的 AI Agent 逃離公司研究網絡,「自行」入侵 AI 公司 Hugging Face 的系統,OpenAI 將此形容為「前所未有的網絡事件」。儘管 Astra 並不涉及此前發生的保安事故,公司仍決定延遲部分開發工作,以加入更嚴格的安全措施。



